作者
通讯作者
《分子植物育种》网络版, 2026 年, 第 24 卷, 第 1 篇
收稿日期: 2026年06月25日 接受日期: 2026年07月17日 发表日期: 2026年07月25日
方宣钧, 2026, 复杂性状遗传学中的因果推断层:从精细定位到跨表型整合的统一统计框架, 分子植物育种, 24(1): 73-86 (10.5376/mpb.2026.24.0005) (Fang X.J., 2026, The causal inference layer in complex trait genetics: a unified statistical framework from fine-mapping to cross-trait integration, Fenzi Zhiwu Yuzhong (Molecular Plant Breeding), 24(1): 73-86 (doi: 10.5376/mpb.2026.24.0005))
全基因组关联研究(GWAS)已在复杂性状与疾病研究中识别出大量关联位点,但这些信号大多源于连锁不平衡(LD)而非直接反映因果变异,从而限制了其机制解释能力。概率精细定位方法通过引入后验纳入概率(posterior inclusion probability, PIP)与可信集合(Credible set),将推断对象从单一显著性位点扩展为因果概率分布,实现了对遗传不确定性的系统刻画。近年来,随着功能注释数据、多祖源研究以及多组学数据的积累,精细定位方法在模型结构与应用场景上不断拓展,但不同方法之间缺乏统一的理论视角。本研究从贝叶斯推断框架出发,系统整合精细定位与共定位分析方法,提出一个以因果配置为核心的统一统计框架。在该框架中,fastPAINTOR通过功能注释构建信息化先验,CAVIAR及其扩展MsCAVIAR通过LD结构与跨研究信息强化似然约束,而共定位分析进一步将推断对象从单表型扩展至多表型空间,实现跨表型因果一致性的概率建模。由此,复杂性状研究可形成从GWAS到精细定位,再到共定位与转录组关联分析(TWAS)的连续推断链条,从而将统计关联逐步转化为生物学机制解释。在此基础上,本研究进一步提出基于推断层级的方法选择策略,明确不同方法在计算复杂度、因果分辨率及信息来源上的权衡关系,并总结出“分层推断”的实践路径。该框架不仅适用于人类复杂疾病研究,也可扩展至作物遗传改良等应用场景,用于评估跨环境与跨群体的因果一致性。本研究将精细定位与共定位分析统一于同一因果推断层,为统计遗传学提供了一种一致的表达语言与分析范式,有助于推动复杂性状研究从关联发现向机制解析与因果推断的系统性转变。
全基因组关联研究(genome-wide association studies, GWAS)在过去十余年中持续推动复杂性状与疾病遗传结构的解析,在人类群体与作物系统中均已识别出大量与表型相关的基因组区域(Lapierre et al., 2020)。然而,GWAS提供的主要是统计关联证据,而非直接的因果解释。由于连锁不平衡(linkage disequilibrium, LD)广泛存在,显著关联位点往往只是与真实功能变异相关的标记SNP,并不必然对应实际发挥生物学作用的因果变异。同时,同一关联区间内还可能存在多个彼此独立的因果信号,这使最显著SNP可直接代表因果位点的假设在统计上难以成立(Hutchinson et al., 2020)。因此,如何在关联区间内部进一步区分相关信号与因果信号,已成为连接群体遗传学分析与功能基因组学解释的重要问题。
从统计遗传学的发展过程来看,复杂性状的基因组研究并不是由单一统计量支撑的,而是围绕不同统计对象逐步展开的。GWAS描述的是位点与性状之间的关联证据,SNP遗传力反映的是特定模型和标记集合下群体层面的方差解释能力,多基因风险评分(PRS/PGS)则进一步将这些效应整合为个体层面的预测函数(Fang and Wu, 2026; Fang, 2026a; Fang, 2026b)。不过,这一推断链条在因果解析层面仍存在明显不足。特别是在LD结构复杂且一个区域内可能同时存在多个因果变异的情况下,研究的重点已不再只是判断某一区域是否与性状相关,而是进一步识别哪些变异更可能是真正的因果位点,以及这一判断本身具有多大不确定性。精细定位(fine-mapping)正是在这一背景下发展起来的,其任务并不是对显著位点进行重复筛选,而是在给定数据与模型假设的条件下,对因果变异的可能性进行概率化刻画,从而在统计遗传学中引入因果概率这一更具解释力的推断对象。
围绕这一目标,精细定位通常以后验纳入概率(posterior inclusion probability, PIP)和可信集合(credible set)为核心分析对象。与传统GWAS主要依赖显著性阈值进行二元判断不同,精细定位更强调在给定数据和模型假设的基础上,对因果配置进行连续的概率估计。由此,研究重点也从是否存在关联,转向候选变异应如何保留及其分别具有多大因果可能性。在这一框架下,credible set不再只是围绕单一候选位点形成的附属结果,而是在预设覆盖概率约束下构建的最小候选变异集合。这样的处理方式能够将不确定性直接纳入推断过程,并为后续功能验证和跨组学整合提供更具操作性的分析基础(Kichaev et al., 2016; Hutchinson et al., 2020)。
然而,从关联信号推向因果概率分布并非易事。首先,复杂LD结构会使多个SNP在统计上呈现高度相关,导致关联信号具有明显的不可辨识性,研究者往往难以仅凭单一统计量将真实因果位点从一组相关变异中分离出来。其次,多因果位点在复杂性状中并不少见,这意味着传统逐步回归或条件分析并不总能稳定识别独立效应,反而可能因模型设定不充分而产生误判(Hutchinson et al., 2020)。因此,精细定位的发展并不仅仅是分析流程上的进一步细化,更要求在显式建模LD结构和因果配置空间的基础上,建立能够表达并传递不确定性的概率模型。
近年来,以贝叶斯概率图谱为代表的精细定位方法逐渐成为该领域的主流框架。这类方法通常将GWAS汇总统计量与LD结构联合建模,并通过引入先验分布,对候选变异的因果可能性进行后验估计,进而形成对局部区域因果结构的概率表达。不同方法虽然都服务于这一目标,但在建模重点上并不相同。fastPAINTOR通过整合功能注释构建信息化先验,并借助近似贝叶斯推断提高计算效率,因此更适合大规模和多性状分析场景;CAVIAR及其扩展MsCAVIAR则在不依赖功能注释的条件下,直接围绕LD结构与多因果配置建模,并通过跨研究或跨祖源数据整合提高因果定位的一致性与分辨率(Lapierre et al., 2020)。与传统单点分析相比,这些方法在统计功效、credible set的紧致性以及跨队列结果的一致性方面均表现出更明显的优势(Hutchinson et al., 2020)。
在此基础上,共定位(colocalization)分析进一步建立了精细定位与功能基因组学之间的衔接。对于GWAS与分子QTL信号在同一区域内的重叠,真正需要回答的问题并不是它们是否同时出现,而是这种重叠是否由同一个因果变异所驱动。共定位分析正是围绕这一问题展开的。它通过统一的概率框架比较GWAS与分子QTL,如eQTL、sQTL、pQTL,或TWAS信号之间共享因果变异的可能性,从而区分真实的因果一致性与仅由LD造成的表面重叠。随着多因果模型的发展,SuSiE等方法进一步提高了因果分解与共定位分析的精度,使跨组学整合不再停留于关联重叠层面,而能够在概率一致性层面获得更为严谨的统计刻画。
基于上述背景,本研究从统计遗传学的整体推断框架出发,将精细定位置于关联发现、方差解释与个体预测之间的关键因果推断层加以理解。文章将围绕fastPAINTOR、CAVIAR和MsCAVIAR等代表性方法,比较其在建模假设、适用边界和计算特征上的差异,进一步澄清PIP与credible set作为因果概率统计对象的方法学含义,并讨论其与共定位分析之间的衔接关系。本研究尝试提出兼顾计算效率、定位精度与数据条件的方法选择框架,为不同研究场景中的实证分析提供更具操作性的判断依据。通过这一思路,精细定位不再只是GWAS之后附加使用的一项技术,而被重新理解为统计遗传学中由关联证据走向因果解释的核心推断环节。
1精细定位的统计基础
1.1因果概率与可信集合:从关联统计量到因果推断目标
精细定位(fine-mapping)的核心任务,并非简单识别“显著位点”,而是在复杂连锁不平衡(linkage disequilibrium, LD)结构与多因果背景下,对“哪些变异为因果、其不确定性如何分布”进行统计刻画。从这一视角看,精细定位所处理的对象,已不再是GWAS中的关联统计量,而是一个新的统计目标:因果概率的后验分布(causal estimand)。
在传统GWAS框架中,单标记检验仅能提供“某一区域存在关联”的证据,却无法区分真实因果变异与其LD邻近标记(Spain and Barrett, 2015; Schaid et al., 2018)。为此,贝叶斯精细定位引入后验纳入概率(posterior inclusion probability, PIP)作为核心度量,对每个候选变异的因果可能性进行量化:
.png)
其中,γj表示第j个SNP是否为因果位点的指示变量,Data表示GWAS汇总统计量,LD表示变异间的相关结构(Hutchinson et al., 2020)。在该框架下,PIP不再是显著性替代指标,而是一个明确的统计对象,刻画在给定数据与模型假设条件下,某一变异为因果的后验概率。
基于PIP排序并逐步累积至预设覆盖阈值,如95%,即可构建最小候选变异集合,即可信集合(credible set) (Hutchinson et al., 2020; Shrestha et al., 2024)。在模型假设成立的前提下,该集合以给定概率包含真实因果位点。与传统上将最显著SNP直接视为因果位点的点估计思路不同,credible set所体现的是一种集合推断逻辑,即不再试图以单一位点承载全部因果解释,而是在概率约束下保留一个能够覆盖真实因果变异的候选空间。这样一来,因果推断中的不确定性被显式纳入统计分析过程之中。若从统计遗传学的整体框架加以理解,GWAS主要提供位点与性状之间的关联证据,SNP遗传力对应群体层面的方差解释(Fang, 2026a),PRS则服务于个体层面的预测(Fang, 2026b),而PIP与credible set所描述的则是位点层面的因果概率分布,由此构成连接关联分析与功能解释之间的关键中间层(图1)。
|
图1 图1基于后验纳入概率(PIP)的可信集合构建流程与示例 注: 本图左侧展示了精细定位的基本统计流程:以GWAS区域的关联统计量(如Z值或效应量)为输入,计算单核苷酸多态性(SNP)的后验纳入概率(posterior inclusion probability, PIP),并按PIP进行排序及累积求和,从而构建在给定覆盖概率(如95%)约束下的可信集合(Credible set)。右侧柱状图展示了一个示例性PIP分布,其中每个柱表示对应SNP的PIP值,虚线表示达到95%累计概率所对应的阈值位置
Figure 1 Workflow and illustrative example of credible set construction based on posterior inclusion probability (PIP). |
在实际应用中,credible set的大小并不是固定的,而是同时受到局部LD结构复杂度和潜在因果位点数量的影响。当LD关系较为简单,且区域内仅存在单一因果位点时,可信集合通常相对紧凑;而在高LD背景或多因果情形下,候选集合往往明显扩大,这本质上反映的是统计不可辨识性增强(Hutchinson et al., 2019)。近年来,校正型credible set进一步改进了覆盖率估计,使其更接近真实因果结构(Shrestha et al., 2024)。因此,这一基于概率集合的分析框架不仅增强了精细定位结果的解释力,也为功能注释整合和跨组学分析提供了较为统一的输入形式。
1.2与传统单点检验的范式差异
从统计推断的角度看,精细定位与传统GWAS单点检验之间的差别,并不只是分析步骤上的细化,而是统计对象与推断目标的根本变化。传统GWAS主要依赖单标记检验(single-SNP test),通过显著性阈值判断某一位点是否与性状相关(Schaid et al., 2018)。这种方法在全基因组范围扫描中具有较高效率,但其背后隐含着一个较强的简化前提,即最显著SNP可以近似代表因果位点。该假设在LD结构复杂或存在多个因果信号时往往难以成立,因而容易造成错误归因,或者在候选位点排序中引入偏差。
与此不同,贝叶斯精细定位并不试图直接从显著性结果中选出单一“最佳位点”,而是将问题重新表述为:在给定LD结构和观测数据的条件下,对所有可能因果配置的后验概率分布进行估计。在这一框架中,PIP提供的是对单个位点因果可能性的连续概率刻画,credible set则是在预设概率约束下构建候选空间。例如,当某一区间内三个SNP的PIP分别为0.60、0.25和0.10时,它们共同构成95% credible set,而不是仅保留其中最显著的一个位点(Hutchinson et al., 2020)。这种处理方式能够更充分地反映局部信号的不确定性,也显著降低了由LD结构驱动的假阳性优先化风险(图2)。
|
图2 连锁不平衡区块(LD block)下p值与后验纳入概率(PIP)的结构差异:单峰关联与多峰因果概率分布的对比 注:图左展示了GWAS关联信号(以−log10(p)表示),其在连锁不平衡(LD)区块内通常呈现单一主峰结构。图右展示了通过精细定位获得的后验纳入概率(posterior inclusion probability, PIP)分布,揭示了多个局部峰值,对应潜在的多个因果变异。阴影区域表示LD区块 Figure 2 p-value vs PIP under an LD block: contrast between single-peak association signals and multi-peak causal probability distributions Note: The left panel shows GWAS association signals represented by −log10(p), typically characterized by a single dominant peak within an LD block. The right panel shows the corresponding posterior inclusion probability (PIP) distribution obtained from fine-mapping, revealing multiple local peaks that reflect potential causal variants. The shaded region denotes the LD block |
更重要的是,精细定位将统计推断从显著性判断推进到概率分布刻画之后,其结果便不再局限于局部关联信号的解释,而能够进一步与其他统计分析模块衔接。PIP与credible set既可以用于功能注释整合,也能够支持跨群体比较和共定位分析,从而在不同数据域之间维持相对一致的度量基础(Kichaev et al., 2014; Gerber et al., 2023)。也正因如此,精细定位不应仅被理解为对GWAS结果的后续筛选步骤,而更应被看作连接关联分析与机制解释的重要推断环节。
1.3概率框架的理论意义:从点估计到因果分布
从更一般的统计视角来看,精细定位的核心意义在于,它将因果推断问题由单一位点的判断转化为后验分布的估计问题。credible set可以理解为在覆盖概率约束下形成的最小集合估计,这一思想与区间估计以及置信集合推断在逻辑上具有较强的一致性(Hutchinson et al., 2019; 2020)。在这一框架下,LD结构与多因果性的影响不再被视为分析中的干扰项,而是被直接纳入模型之中,使因果推断从确定性判断转向概率分布刻画。相较于依赖单个显著位点给出结论的做法,这种处理方式能够更真实地反映复杂性状遗传结构中的不确定性,也避免了对局部关联信号进行过度简化。
与此同时,因果概率一旦以PIP和credible set的形式被表达出来,就可以作为后续分析继续传递下去,从而为不同层面的整合研究提供共同的概率基础。例如,在GWAS与eQTL的联合分析中,研究者可以通过比较credible set的重叠情况或联合后验概率,进一步判断不同信号之间是否可能共享因果变异。也就是说,精细定位并非只是在局部区域内提高定位精度,它还承担着将不确定性传递到下游分析中的作用,使功能注释整合、共定位分析以及跨组学研究能够在统一的概率尺度下展开。
此外,由于PIP本质上定义在概率空间中,并不依赖于特定统计量的表现形式,例如p值或效应值,因此它在不同研究设计、不同群体和不同组学数据之间具有更强的可比性。这种特性使其能够作为跨数据域表达因果信息的共同语言,为跨研究整合提供方法学基础(Shrestha et al., 2024)。特别是在多祖源研究中,不同群体之间的LD结构差异可以被视为一种天然存在的额外约束。不同LD模式会改变非因果变异与真实因果位点之间的相关关系,因此有助于进一步压缩credible set并提高因果分辨率(Spain and Barrett, 2015)。这一点也使精细定位在多祖源研究中具有更突出的应用价值,并自然延伸到后续MsCAVIAR等方法的发展。
2 fastPAINTOR:注释驱动的因果概率模型
2.1模型框架:从统计证据到注释信息的联合推断
在精细定位的统一贝叶斯框架下,不同方法的核心差异并不在于“是否进行概率推断”,而在于如何构建因果配置的先验分布。从这一角度看,fastPAINTOR可以被理解为一种典型的注释驱动的因果概率模型(annotation-informed causal model),其目标是在GWAS统计证据与功能注释之间建立统一的概率映射关系。
在一般形式下,精细定位问题可表示为对因果配置向量
的后验分布估计:
.png)
其中,表示GWAS汇总统计量,表示LD结构,表示功能注释信息。就模型结构而言,这一表达式包含两个彼此关联的部分:一部分是由LD约束下的关联统计量所决定的似然项(likelihood),另一部分则是由功能注释所引导的先验项(prior)。与假定所有SNP具有相同因果概率的传统做法不同,fastPAINTOR的关键改进就在于对先验项进行了重新建模,引入基于注释信息的逻辑回归模型:
.png)
其中,aj表示第j个SNP的功能注释向量(如eQTL、染色质可及性、转录因子结合位点等)。这一建模策略实质上将“生物学功能潜力”转化为“统计先验概率”,从而实现统计证据与功能信息的统一整合(Kichaev et al., 2014)。
若从统计遗传学的角度理解,基础fine-mapping模型刻画的是LD约束下的因果概率分布,而fastPAINTOR进一步描述的则是条件于功能注释的信息化因果概率分布,因此其推断对象具有更强的生物学解释性。为了在这一框架下完成后验估计,fastPAINTOR采用近似贝叶斯方法,如变分推断或重要性采样,以避免对全部因果配置空间进行指数级枚举,或承担传统MCMC带来的高计算成本(Talukdar et al., 2023)。其优化目标可表示为证据下界(evidence lower bound, ELBO):

该近似策略在保证推断精度的同时显著提升了计算效率,使模型能够扩展至全基因组尺度及多性状分析场景。
2.2方法学特征:信息整合、可扩展性与解释能力
从方法学特征来看,fastPAINTOR的优势首先体现在它能够将外部功能信息直接纳入因果概率建模过程。对于位于增强子、启动子区域,或具有eQTL支持的变异,模型会赋予其更高的先验权重。这样一来,PIP所反映的不再只是统计关联强度,还包含了功能相关性的线索,因此在解释候选因果位点时具有更强的生物学意义(Kichaev et al., 2016)。
与此同时,fastPAINTOR在计算层面也具有较强的扩展能力。由于采用近似贝叶斯推断,该方法避免了MCMC在高维因果配置空间中的计算瓶颈,从而能够在大规模GWAS数据和多注释条件下保持较高的运行效率。对于当前以生物库规模数据为代表的大样本研究而言,这一特征尤为重要。
在此基础上,引入功能注释还能够进一步提高因果定位的分辨率。尤其是在多性状或多注释分析场景下,fastPAINTOR通常可以有效压缩credible set的规模。已有研究表明,在保留较高覆盖率的前提下,引入功能注释可使候选集合缩小约40%~60% (Kichaev et al., 2016)。对于后续实验验证资源有限的研究来说,这种候选空间压缩具有直接的实践价值。
若将上述特征放回统一框架中考察,可以认为fastPAINTOR的主要优势来自对先验结构的优化。也就是说,在似然模型保持不变的条件下,功能注释的引入提高了因果概率分布的可辨识性(identifiability),从而增强了模型对真实因果位点的区分能力。
2.3方法边界与潜在偏倚
尽管fastPAINTOR在信息整合和计算效率方面具有明显优势,但其推断表现也高度依赖先验模型本身的合理性,因此这种方法在增强解释力的同时,也引入了新的方法学风险。
2.3.1先验偏倚
当功能注释存在噪声、不完整或系统偏差时,先验分布可能误导后验推断,使非因果变异被错误优先化,或真实因果变异被低估。这一问题本质上是“先验驱动的estimand偏移”,需要通过多注释整合或稳健性分析进行缓解。
2.3.2跨群体可迁移性
功能注释往往具有群体或组织特异性。在跨祖源研究或非模式物种中,注释信息可能不再适用,从而削弱模型性能。因此,在跨群体应用中需要谨慎解释结果。
2.3.3近似推断误差
尽管变分推断提高了计算效率,但在复杂LD结构或多因果位点情境下,近似方法可能低估后验不确定性,导致credible set过度收缩或遗漏真实因果变异。
3 (Ms)CAVIAR:跨研究因果一致性的概率建模
3.1 CAVIAR:LD驱动的因果配置模型
在精细定位的统一贝叶斯框架中,CAVIAR(CAusal Variants Identification in Associated Regions)代表了一类以似然结构为核心的因果概率模型。与fastPAINTOR通过注释信息构建先验不同,CAVIAR的关键特征在于:在不依赖外部功能信息的前提下,仅利用GWAS汇总统计量与连锁不平衡(LD)结构,对因果配置的后验分布进行推断(Lapierre et al., 2020)。
在形式上,CAVIAR直接对GWAS Z分数向量的联合分布进行建模。设某一区间包含m个SNP,其Z分数向量记为Z=(Z1,…,Zm),在给定因果配置
的条件下满足:
.png)
其中,γ为由LD结构决定的协方差矩阵,σ2表示残差方差。该模型的关键在于将LD结构显式纳入似然函数之中,从而使相关信号与因果信号能够在同一统计框架下加以区分。
在这一框架下,CAVIAR通过枚举或近似评估可能的因果配置集合,对每个SNP计算后验纳入概率(posterior inclusion probability, PIP),并构建满足预设覆盖概率(如95%)的credible set。与单点检验不同,该方法允许
个因果位点同时存在,从而在统计上解决“信号模糊性”(signal ambiguity)问题。
从统一视角看,CAVIAR所刻画的是一种主要由LD结构和关联统计量共同决定的因果概率分布,即LD-driven causal estimand。与依赖注释信息的模型相比,它不受外部功能信息质量的直接影响,因此在功能注释缺失、注释本身可能存在偏倚,或研究对象处于跨物种背景时,往往表现出更高的稳健性。
3.2 MsCAVIAR:跨研究因果一致性的扩展
在单研究精细定位的基础上,MsCAVIAR (Multiple Study CAVIAR)将推断范围进一步扩展。它所关注的已不再只是某一区间内因果位点的识别,而是跨研究或跨群体条件下因果一致性(causal sharing)的评估。也就是说,推断的重点不再局限于某一研究中的因果概率,而转向考察某一变异在多个研究中是否可能作为共享因果位点出现。
在建模上,MsCAVIAR引入随机效应模型以刻画跨研究效应的异质性。设第j个SNP在第s个研究中的效应为βjs,则有:
.png)
其中,μj表示跨研究共享效应,
则刻画效应异质性。通过联合多个研究的统计量及其各自的LD结构,MsCAVIAR不仅能够估计单研究层面的PIP,即研究内因果概率,还能够进一步估计跨研究共享PIP (shared causal probability)。
这一建模思路的重要之处在于,它使不同群体间LD结构的差异不再只是分析中的背景条件,而成为可以被利用的信息来源。若某一SNP在不同人群中的相关结构并不相同,则非因果变异所产生的关联强度通常会随LD模式变化而波动,而真实因果位点则更可能在不同研究中表现出相对一致的信号。MsCAVIAR正是利用这种差异,对伪信号进行剔除,并进一步压缩credible set (Lapierre et al., 2020)。
实证研究表明,在跨祖源GWAS分析中,如血脂性状与2型糖尿病研究,MsCAVIAR相较于单研究方法可显著缩小credible set,幅度约为20%或以上,同时仍能维持较高的因果覆盖率。这说明跨研究整合带来的并不仅是统计功效的提升,也包括因果推断稳健性的增强。
3.3方法权衡:稳健性、分辨率与计算复杂度
从方法学角度看,(Ms)CAVIAR与fastPAINTOR形成了一个典型对照:
· fastPAINTOR:通过优化先验提高分辨率
· CAVIAR:通过建模似然结构提高稳健性
对于CAVIAR及MsCAVIAR而言,其一个突出优点在于不依赖功能注释,因此对外部信息偏差不敏感。在注释资源不足、注释质量不稳定,或研究对象并非功能信息较为完善的模式物种时,这种特性尤为重要。相比之下,这类方法更依赖于LD结构本身及其所包含的统计约束,因此在功能信息缺乏的条件下往往更具稳健性。
MsCAVIAR进一步的优势则来自对跨群体LD差异的利用。不同人群中的LD模式并不完全一致,这为因果信号与非因果相关信号的分离提供了额外条件。也正因为如此,MsCAVIAR能够在单研究分析难以完成的情形下,通过跨研究整合进一步提高分辨率。这种基于异质性的信息增益,本质上是一种跨LD解耦机制,是单研究框架所不具备的。
不过,这类方法的主要局限同样十分明确,即其计算代价较高。由于需要评估高维因果配置空间,随着候选SNP数量增加以及潜在因果位点数上升,计算复杂度会迅速增长。在MsCAVIAR中,这一问题因多研究联合建模而进一步放大(Lapierre et al., 2020)。因此,在实际应用中,不同方法往往存在较明确的分工。fastPAINTOR更适用于全基因组扫描与高通量分析,而(Ms)CAVIAR则更适合候选区间的精细解析以及跨群体条件下的验证研究。
随着算法持续优化和计算资源不断提升,跨研究精细定位预计将在复杂性状研究中发挥越来越重要的作用,并有望逐步成为标准分析流程的一部分。
4共定位分析与eQTL/TWAS接口:跨表型因果一致性的概率框架
4.1从关联重叠到因果一致性:问题的重新表述
尽管GWAS已在全基因组范围内识别出大量与复杂性状相关的关联区域,但这些统计信号本身并不直接揭示其背后的分子机制。分子数量性状位点(molecular QTL),包括表达数量性状位点(eQTL)、剪接QTL (sQTL)以及蛋白QTL (pQTL),为理解遗传变异如何通过调控转录或翻译过程影响表型提供了关键线索(Okamoto et al., 2023)。与此同时,转录组关联研究(TWAS)通过构建基因表达预测模型,将遗传变异映射至基因层面的关联信号,从而进一步提出候选致病基因。
但需要指出的是,GWAS信号与分子QTL或TWAS信号在同一区间内出现重叠,并不意味着它们一定由同一因果变异所驱动。由于连锁不平衡(LD)和等位异质性(allelic heterogeneity)同时存在,同一区间内多个高度相关的变异可能分别作用于不同表型,从而在统计上形成信号重叠,却并不对应真正意义上的因果一致性。这种现象通常可称为伪共定位(false colocalization)。在统计遗传学的统一框架下,这一问题可以被重新表述为:给定两个表型(如GWAS性状与eQTL表达),它们是否共享同一因果变异的后验概率是多少?
共定位分析(colocalization analysis)正是为回答这一问题而提出,其核心是对跨表型因果一致性(cross-trait causal sharing)进行概率化建模(Giambartolomei et al., 2013; Hormozdiari et al., 2016)。
从本研究的整体视角看,若fine-mapping刻画的是“单表型的因果概率分布(PIP)”,则共定位进一步刻画的是:“两个或多个表型之间共享因果变异的联合后验分布”,从而构成统计遗传学中连接“位点层因果推断”与“机制解释”的关键桥梁。
4.2共定位的贝叶斯基础:从单因果到多因果模型
共定位方法的核心在于构建不同因果假设下的后验概率分布。以经典方法COLOC为例,其在一个给定基因组区间内定义五种互斥假设(H0–H4):
· H0:两个性状均无关联
· H1:仅GWAS性状有关联
· H2:仅QTL性状有关联
· H3:两者均有关联,但由不同因果变异驱动
· H4:两者共享同一因果变异
通过计算各假设的后验概率
,其中
(通常记为PP4)用于衡量共定位证据强度(Giambartolomei et al., 2013)。
这一框架的优势在于,它并不依赖单一lead SNP来作出判断,而是能够在区域层面利用credible set所包含的整体信息,并将不确定性显式纳入推断过程。因此,与单纯依赖峰值重叠的做法相比,COLOC在统计解释上更为严谨。不过,COLOC有一个重要前提,即假定每个性状在该区间内至多只有一个因果位点。
在复杂性状研究中,多因果信号并不少见,因此这一单因果假设往往显得过于简化。正因如此,后续出现了一系列扩展方法,用以适应更复杂的遗传结构。eCAVIAR允许一个区间内存在多个因果位点,并结合LD结构计算联合共定位概率(CLPP);moloc将共定位框架扩展到多性状联合建模;HyPrColoc则进一步适用于高维多性状共定位分析。这些方法虽然具体实现不同,但在思想上具有共同点,即都将fine-mapping中的因果配置空间进一步扩展到多表型联合空间。因此,从统一框架来看,共定位可以理解为fine-mapping在表型维度上的进一步延伸。
4.3与fine-mapping (fastPAINTOR / (Ms)CAVIAR)的接口
共定位分析与前述精细定位方法之间存在天然的衔接关系。其基本逻辑在于,fine-mapping首先提供单表型条件下的PIP与credible set,而colocalization则在此基础上继续评估不同表型之间共享因果变异的概率。这一关系可以形式化理解为:

在实际研究中,这种关系通常表现为一个两阶段的推断流程。第一阶段位于位点层面,研究者利用fastPAINTOR或(Ms)CAVIAR在单一表型下进行精细定位,从而获得分辨率较高的PIP分布与credible set。第二阶段则转入跨表型层面,在前一阶段结果的基础上,进一步使用COLOC、eCAVIAR或moloc等方法评估GWAS与QTL或TWAS信号之间的共定位概率。
这一分析流程之所以具有较强的应用价值,在于各方法之间存在清晰的互补关系。fastPAINTOR主要通过整合注释信息压缩候选空间,(Ms) CAVIAR则依靠LD结构及跨群体差异提高推断稳健性,而共定位分析进一步通过跨表型联合推断检验因果一致性。最终,再结合TWAS对基因层面信号的整合输出,便可形成从GWAS到fine-mapping、再到colocalization与TWAS、并最终指向候选基因识别的完整推断链条:
GWAS→fine-mapping→colocalization→TWAS→candidate gene
这一连续分析路径表明,统计遗传学的研究重心已经不再停留于关联信号的发现,而是逐步转向对分子机制的系统解释(Hormozdiari et al., 2016; Okamoto et al., 2023)。
5方法选择的实践指南:基于推断层级的决策框架
5.1三维权衡的统一解释:计算、可辨识性与信息来源
在精细定位与跨组学分析中,方法选择并不是简单的工具偏好问题,而是对不同统计推断策略进行系统权衡的结果。其核心通常围绕三个相互制约的方面展开,即计算复杂度、因果分辨率或可辨识性,以及信息来源的结构特征,包括LD、功能注释和跨研究数据等。在统一贝叶斯框架下,不同方法之间的差异,本质上可以理解为利用不同类型的信息,对同一因果配置空间施加约束的方式不同(Schaid et al., 2018; Hutchinson et al., 2020)。
(1) fastPAINTOR:通过“先验信息”提升分辨率
fastPAINTOR的核心在于利用功能注释构建信息化先验,从而在似然结构保持不变,即LD结构固定的条件下,提高因果位点的可辨识性(Kichaev et al., 2014, 2016)。这一方法的优势主要体现在两个方面。一方面,它能够在全基因组尺度上保持较高的运行效率,适合大规模分析;另一方面,当功能注释信息较为充分时,它通常能够显著压缩credible set,从而提高候选因果位点的排序分辨率。已有研究表明,整合功能注释不仅可以减少候选集合规模,也有助于提升因果变异的优先排序能力(Kichaev et al., 2016; Zou et al., 2021)。
不过,这种优势本身也构成了其局限。fastPAINTOR的推断结果对注释质量具有较高敏感性,一旦功能注释存在噪声、缺失或系统偏差,就可能将这些偏差传递到后验推断之中,进而引入系统误差。因此,从统计角度看,fastPAINTOR本质上是一种依靠先验信息提高因果分辨率的模型,即annotation-informed prior model。
(2) CAVIAR:通过“似然结构”保证稳健性
与fastPAINTOR不同,CAVIAR并不依赖功能注释,而是通过对LD结构的显式建模,在似然层面区分相关信号与因果信号(Schaid et al., 2018)。这一特征使其对外部信息的依赖较低,因此在功能注释不足或注释可信度有限的条件下,通常表现出更高的稳健性。同时,CAVIAR允许一个区域内存在多个因果位点,在处理复杂遗传结构时具有较强的模型灵活性。
但这种稳健性并非没有代价。由于CAVIAR需要在较高维的因果配置空间中进行评估,其计算复杂度会随着候选SNP数量以及潜在因果位点数目的增加而迅速上升。因此,CAVIAR更适合被理解为一种以似然建模为核心、强调稳健性的因果推断策略,即likelihood-driven model。
(3) MsCAVIAR:通过跨研究信息增强可辨识性
MsCAVIAR是在CAVIAR基础上向跨研究或跨群体情境的延伸。它通过联合建模多个研究中的统计信号及其各自的LD结构,进一步提高因果位点的识别能力(Lapierre et al., 2020)。这一方法最重要的优势,在于能够利用不同研究之间LD模式的差异,对非因果信号进行更有效的剔除,并提升跨研究条件下因果一致性的判断能力。
与此同时,MsCAVIAR对数据条件的要求也更高。它依赖多研究数据的完整性与可比性,而且由于模型联合了多个研究的统计信息,其计算复杂度也显著增加。因此,MsCAVIAR可以被看作是一类通过跨研究信息扩展因果推断范围并增强可辨识性的模型,即cross-study model。
(4)共定位方法:跨表型因果一致性的推断
共定位方法,如COLOC和eCAVIAR等,将推断对象从单一表型扩展到多表型空间,重点评估不同表型之间是否共享因果变异,从而实现跨表型因果一致性的概率建模(Giambartolomei et al., 2013; Hormozdiari et al., 2016)。相较于精细定位主要关注位点层面的因果概率,共定位方法进一步把推断对象扩展为共享因果概率,因此能够直接连接GWAS信号与分子机制解释。
不过,这类方法的表现通常受到下游分子QTL数据质量以及组织、细胞类型匹配程度的明显影响。也正因为如此,共定位方法更适合被理解为跨表型层面的因果推断框架,即cross-trait causal inference。
5.2基于推断层级的决策路径
在实际研究中,方法选择更适合依据推断层级(inference layer)来系统安排,而不是依靠经验性判断。不同研究阶段面对的问题并不相同,因此所需方法也应随推断目标而变化。
(1)全基因组扫描阶段
在全基因组扫描阶段,研究目标通常是尽快缩小候选空间,以便在大规模数据中完成初步筛选。在这种情况下,fastPAINTOR通常是较合适的选择。其适用前提是研究者能够获得质量较高的功能注释信息。借助注释驱动的优先排序机制,该方法能够在高通量分析条件下兼顾效率与候选位点压缩效果(Kichaev et al., 2016; Zou et al., 2021)。
(2)区域精细解析阶段
当分析进入候选区域的精细解析阶段时,研究重点从大范围筛选转向对因果位点集合的稳健识别。此时,CAVIAR通常更具优势。特别是在功能注释不足或局部LD结构复杂的条件下,该方法不依赖先验信息,更能体现其稳健性(Schaid et al., 2018)。
(3)跨研究整合阶段
当研究目标进一步转向跨研究或跨祖源条件下的因果一致性评估时,MsCAVIAR则更为适用。它能够利用不同研究之间的LD差异增强识别能力,从而在多队列或多祖源研究中提升因果一致性判断和定位分辨率(Lapierre et al., 2020)。
(4)机制解释阶段
在机制解释阶段,重点已不再只是定位因果变异,而是进一步连接遗传变异与分子功能过程。在这一阶段,共定位分析结合TWAS通常能够更有效地评估跨表型因果一致性,并将GWAS结果与潜在分子机制联系起来(Giambartolomei et al., 2013; Okamoto et al., 2023)。
5.3一个统一的实践策略:分层推断链条
综合上述分析,可以将复杂性状研究中的方法选择总结为一个统一推断路径:
GWAS→fine-mapping→colocalization→TWAS/functional validation
在这一框架中,各种方法之间并不是简单的替代关系,而是在不同推断层级上,对同一因果问题进行逐步约束和持续细化的不同步骤(Schaid et al., 2018; Hutchinson et al., 2020)。其中,fastPAINTOR和CAVIAR主要作用于单表型因果空间的约束,MsCAVIAR进一步处理跨研究条件下的因果一致性,而共定位分析则将推断扩展到跨表型因果一致性的层面。
这种分层推断策略的意义,在于能够最大限度地整合不同来源的信息,包括LD结构、功能注释、跨研究数据和跨组学信息,同时在计算效率与推断精度之间寻求平衡,并尽可能降低单一方法可能带来的系统偏差。正是在这一意义上,方法选择不应被理解为彼此替代的技术比较,而应被视为围绕同一因果推断目标所展开的分层决策过程。
6讨论:从关联信号到因果推断层的统一框架
6.1从方法互补到统计框架统一
现有精细定位方法往往被视为针对不同研究场景所发展的工具集合,但若从统计遗传学的统一视角加以考察,这些方法本质上都在不同信息约束条件下,对同一因果配置空间进行推断。fastPAINTOR、CAVIAR及其扩展MsCAVIAR之间的差异,可以理解为对贝叶斯模型不同组成部分的强调有所不同:fastPAINTOR主要通过功能注释强化先验结构(Kichaev et al., 2014; 2016),CAVIAR则通过显式建模LD结构强化似然约束(Schaid et al., 2018),而MsCAVIAR在此基础上进一步通过跨研究整合引入额外的数据约束(Lapierre et al., 2020)。
因此,这些方法之间的互补性并不是经验层面的简单拼接,而是建立在同一因果estimand在不同信息维度上被逐步增强约束的基础之上。在这一框架下,方法选择也不再只是工具层面的比较,而是在既定数据条件下,选择何种路径更有效地逼近因果概率分布。正是在这一意义上,精细定位方法不应被看作彼此分离的离散技术,而应被理解为统一统计框架中的不同实现方式。
6.2信息整合的双重路径:先验增强与数据扩展
提高精细定位分辨率的核心,在于增强因果配置的可辨识性(identifiability)。从现有方法体系来看,这一目标主要沿着两条路径展开。一条路径是通过引入功能注释增强先验信息。以fastPAINTOR为代表的方法,将eQTL、ATAC-seq、ChIP-seq等生物学信息转化为信息化先验,从而提高候选因果位点的后验概率(Kichaev et al., 2016; Zou et al., 2021)。当注释质量较高时,这一策略不仅有助于压缩credible set,也能提高结果的生物学解释力。不过,这一路径对注释质量的依赖较强,一旦功能信息存在偏倚或不完整,就可能引起先验误设,并进一步影响后验推断结果(Kichaev et al., 2016)。
另一条路径则体现为对观测数据的扩展,尤其是通过整合多群体或多研究数据来利用LD结构差异,从而增强因果位点识别能力。MsCAVIAR等方法正是在这种思路下,通过联合建模不同研究中的统计信号,提高了因果推断的稳健性和分辨率(Lapierre et al., 2020)。与依赖注释信息的方法相比,这一路径不直接依赖外部功能数据,并能够更有效地剔除由LD驱动的伪信号,但代价是对数据质量、研究间可比性以及计算资源提出了更高要求(Schaid et al., 2018)。
从统一视角看,这两条路径可以概括为通过增强先验信息或扩展观测数据,提高因果推断的可辨识性。在实践中,“高质量注释 + 多祖源数据整合”往往能够实现效率与稳健性的最佳平衡。
6.3从单表型到跨表型:因果推断层的扩展
精细定位主要处理的是单一表型条件下的因果概率分布,而共定位分析则将这一推断框架进一步扩展到多表型空间,通过评估不同表型是否共享因果变异,实现跨表型因果一致性的概率建模(Giambartolomei et al., 2013; Hormozdiari et al., 2016)。在统计意义上,这一扩展对应于从单变量后验分布向联合后验分布的推广。
在实际分析流程中,这种扩展逐渐形成了一条连续的推断链条:
GWAS→fine-mapping→colocalization→TWAS
这一链条将统计关联信号嵌入到“变异—基因—表型”的因果路径中,从而推动复杂性状研究由关联发现向机制解释转变(Okamoto et al., 2023)。
6.4在作物遗传改良中的应用前景
尽管概率精细定位方法主要发展于人体遗传学研究,其在作物遗传改良中的应用同样具有重要潜力。植物性状通常同时受到环境依赖性和群体结构复杂性的影响,单一环境或单一群体条件下得到的GWAS结果往往稳定性有限(Schaid et al., 2018)。
在这种背景下,以PIP和credible set为核心的概率框架可用于评估因果信号在多环境和多群体中的一致性,从而识别更稳定的遗传因子。具体而言,MsCAVIAR可用于跨群体条件下的因果一致性验证(Lapierre et al., 2020),共定位分析有助于连接遗传变异与分子机制(Giambartolomei et al., 2013),而功能注释整合则可用于优先排序候选位点(Kichaev et al., 2016)。这些方法的结合,为分子标记辅助选择(MAS)和基因编辑靶点筛选提供了更可靠的统计基础。
6.5与后续因果推断方法的衔接
精细定位与共定位分析同时构成了更高层因果推断方法的重要基础。在孟德尔随机化(MR)分析中,若以credible set为基础筛选工具变量,可以减少由LD驱动的假阳性,从而提高工具变量的有效性(Broekema et al., 2020)。与此同时,结合共定位与TWAS结果,还可以进一步构建变异—基因—通路—表型的多层因果网络,从而推动研究视角由单基因解释向系统生物学解释扩展(Okamoto et al., 2023)。
因此,在统一框架下,精细定位所承担的作用,并不仅仅是对关联信号进行局部细化,而是将统计关联结果转化为可用于后续因果推断的候选集合,并由此构成整个因果分析链条中的关键中间层。
6.6未来方向:统一因果推断框架的拓展
未来统计遗传学的发展,仍将沿着统一因果推断框架不断推进。其中较为重要的方向包括多祖源与多组学数据的深入整合(Lapierre et al., 2020)、多性状与网络层模型的发展,如Genomic SEM,以及机器学习方法在高维因果推断中的进一步应用。不过,尽管方法形态不断扩展,其面临的核心问题并未改变,即如何在复杂数据结构下保持因果推断的可解释性与可重复性。
在这一背景下,以PIP和credible set为核心的概率框架仍将作为不同方法之间的重要连接基础,继续发挥统一表达语言的作用,并支撑统计遗传学由关联分析向因果推断不断演进(Schaid et al., 2018)。
7结论
概率精细定位的发展,标志着统计遗传学研究范式正在发生重要变化。复杂性状研究的重点,已不再停留于对关联信号的检测,而是逐步转向以因果概率分布为核心的推断框架。在这一框架下,遗传变异不再仅依赖显著性水平进行排序,而是通过后验纳入概率(PIP)和可信集合(credible set)加以概率化刻画,由此能够更系统地表达因果推断中的不确定性。这一变化意味着,复杂性状研究正在由关联信号的定位逐步转向对因果机制的解析。
本研究的主要工作在于从统一的贝叶斯视角出发,将不同精细定位方法纳入同一因果配置框架下加以理解。在这一框架中,各类方法虽然在实现路径上存在差异,但本质上都服务于同一因果空间的约束与刻画。其中,依赖功能注释的方法主要通过先验信息提高分辨率,依赖连锁不平衡结构的方法则通过似然建模增强稳健性,而跨研究整合方法进一步借助数据扩展提高因果信号的可辨识性。由此可见,这些方法之间的区别,更多体现在信息利用方式的不同,而不是推断目标本身的改变。
这一推断框架还能够自然延伸到多表型分析层面。通过对不同表型是否共享因果变异进行概率建模,共定位分析将单表型下的因果推断进一步扩展为跨表型因果一致性的评估,从而在统计层面建立起遗传变异与分子机制之间的联系。由此,复杂性状研究逐渐形成了一条连续的推断路径,即从GWAS出发,经由精细定位与共定位分析,进一步走向功能解释与候选基因识别。
从实际应用角度看,方法选择应结合推断层级和数据结构进行系统安排。不同方法之间并不是简单的替代关系,而是在同一因果推断过程中针对不同问题所采取的不同步骤。只有在具体研究场景中对这些方法进行合理组合,才有可能在计算效率、推断稳健性与生物学解释之间取得平衡,并进一步提高复杂性状解析的整体可靠性。
此外,概率精细定位框架的应用范围也已不再局限于人类疾病研究,而是逐步延伸至作物遗传改良等领域。在多环境和多群体背景下,该框架可用于评估因果信号的一致性,进而识别更稳定的遗传因素,并为分子育种和基因编辑提供更具操作性的候选靶点。这表明,概率精细定位不仅体现了统计方法本身的进展,也正在成为连接基础研究与应用实践的重要桥梁。
作者贡献
方宣钧是本研究的执行人,完成文献调研、数据分析以及论文初稿的写作与修改。作者本人已阅读并同意最终的文本。
致谢
本研究由国家自然科学基金重大项目(30490254)资助。
Broekema R.V., Bakker O.B., and Jonkers I.H., 2020, A practical view of fine-mapping and gene prioritization in the post-genome-wide association era, Open Biology, 10(1): 190221.
https://doi.org/10.1098/rsob.190221
Fang X.J., 2026a, Genome-wide relationship matrix-based heritability estimation: statistical interpretation, comparability, and practical diagnostics in the GCTA-GREML framework, Computational Molecular Biology, 16(3): 159-180.
Fang X.J., 2026b, Polygenic Risk Scores (PRS/PGS) across Multi-ancestry and Cross-domain Settings: Statistical Framework, Methodological Advances, and Robustness Evaluation, Genomics and Applied Biology, 17(3): 138-153.
Fang X.J., and Wu W.R., 2026, Evolution of statistical genetic paradigms: from linkage analysis and candidate gene strategies to GWAS, Molecular Plant Breeding, 24(9): 2817-2829.
Gerber Z., Fisun M., Aschard H., and Djebali S., 2023, PaintorPipe: A pipeline for genetic variant fine-mapping using functional annotations, Bioinformatics Advances, 4: vbad188.
https://doi.org/10.1093/bioadv/vbad188
Giambartolomei C., Vukcevic D., Schadt E.E., Franke L., Hingorani A. D., Wallace C., and Plagnol V., 2013, Bayesian test for colocalisation between pairs of genetic association studies using summary statistics, PLoS Genetics, 10(5): e1004383.
https://doi.org/10.1371/journal.pgen.1004383
Hormozdiari F., Kostem E., Kang E. Y., Pasaniuc B., and Eskin E., 2016, Identifying causal variants at loci with multiple signals of association, Genetics, 198(2): 497-508.
https://doi.org/10.1534/genetics.114.167908
Hutchinson A., Watson H., and Wallace C., 2019, Correcting the coverage of credible sets in Bayesian genetic fine-mapping, bioRxiv, 781062.
https://doi.org/10.32614/CRAN.package.corrcoverage
Hutchinson A., Watson H., and Wallace C., 2020, Improving the coverage of credible sets in Bayesian genetic fine-mapping, PLoS Computational Biology, 16(4): e1007829.
https://doi.org/10.1371/journal.pcbi.1007829
Kichaev G., Yang W., Lindstrom S., Hormozdiari F., Eskin E., Price A. L., Kraft P., and Pasaniuc B., 2014, Integrating functional data to prioritize causal variants in statistical fine-mapping studies, PLoS Genetics, 10(10): e1004722.
https://doi.org/10.1371/journal.pgen.1004722
Lapierre N., Taraszka K., Huang H., He R., Hormozdiari F., and Eskin E., 2020, Identifying causal variants by fine mapping across multiple studies, PLoS Genetics, 17(4): e1009733.
https://doi.org/10.1371/journal.pgen.1009733
Okamoto K., Schmitz R. J., and Shinozaki K., 2023, Multi-omic integration for functional genomics in plant and human GWAS, Nature Reviews Genetics, 24(1): 30-44.
Schaid D. J., Chen W., and Larson N. B., 2018, From genome-wide associations to candidate causal variants by statistical fine-mapping, Nature Reviews Genetics, 19(8): 491-504.
https://doi.org/10.1038/s41576-018-0016-z
Shrestha M., Bai Z., Gholipourshahraki T., Hjelholt A., Hu S., Kjølby M., Rohde P., and Sørensen P., 2024, Evaluation of Bayesian linear regression models as a fine mapping tool, bioRxiv.
https://doi.org/10.1101/2023.09.01.555889
Spain S. L., and Barrett J. C., 2015, Strategies for fine-mapping complex traits, Human Molecular Genetics, 24(R1): R111-R119.
https://doi.org/10.1093/hmg/ddv260
Talukdar G., Orr H.T., and Lei Z.X., 2023, The PERK pathway: beneficial or detrimental for neurodegenerative diseases and tumor growth and cancer, Human Molecular Genetics, 32(16): 2545-2557.
https://doi.org/10.1093/hmg/ddad103
Zou Y., Carbonetto P., Wang G., and Stephens M., 2021, Fine-mapping from summary data with the "Sum of Single Effects" model, PLoS Genetics, 18(7), e1010299.
.png)
.png)
.png)